Méthodes par différences temporelles n-Step (n-step TD Methods)

4.Apprentissage de type Off-policy avec les méthodes n-step

Principe de fonctionnement

Pour rappel, l'apprentissage de type Off-policy consiste à apprendre une fonction des valeurs d'actions d'une stratégie $\pi$, alors que l'exploration se fait à l'aide d'une autre stratégie, $b$. Souvent, $\pi$ est une stratégie optimale par rapport à la fonction des valeurs d'actions courante, alors que $b$ est davantage exploratrice, comme par exemple de type ɛ-greedy.

Pour pouvoir utiliser les données obtenues avec $b$ avec $\pi$, il faut prendre en compte les différences entre les deux stratégies. Cela se fait en considérant leurs probabilités respectives sur les actions qui ont été prises. Dans les méthodes n-step, les revenus sont construits à travers n pas de temps, on a donc besoin des probabilités relatives sur ces $n$ actions.

Par exemple, pour réaliser une version Off-policy d'une méthode n-step, une mise à jour à l'instant $t$ (et donc réalisée à l'instant $t+n$) peut se faire en utilisant le ratio d'échantillonnage préférentiel obtenu sur cette intervalle:

$${V_{t + n}}\left( {{S_t}} \right) = {V_{t + n - 1}}\left( {{S_t}} \right) + \alpha {\rho _{t:t + n - 1}}\left[ {{G_{t:t + n}} - {V_{t + n - 1}}\left( {{S_t}} \right)} \right], \quad 0 \le t \le T$$

avec ${\rho _{t:t + n - 1}}$ le ratio d'échantillonnage préférentiel décrivant le rapport des probabilités de prendre les $n$ actions entre les deux stratégies, depuis l'état $S_t$ jusqu'à l'état $S_{t+n}$ ($A_t$ à $A_{t+n-1}$) :

$${\rho _{t:h}} = \prod\limits_{k = t}^{\min \left( {h,T - 1} \right)} {\frac{{\pi \left( {{A_k}|{S_k}} \right)}}{{b\left( {{A_k}|{S_k}} \right)}}}$$

L'équation permettant d'obtenir la valeur des actions peut être obtenue à partir de celle utilisée pour la méthode Sarsa n-step :

$${Q_{t + n}}\left( {{S_t},{A_t}} \right) = {Q_{t + n - 1}}\left( {{S_t},{A_t}} \right) + \alpha {\rho _{t + 1:t + n}}\left[ {{G_{t:t + n}} - {Q_{t + n - 1}}\left( {{S_t},{A_t}} \right)} \right], \quad 0 \le t \le T$$

Remarquons ici que le calcul du ratio d'échantillonnage préférentiel se fait un pas de temps après ce qui se fait pour le calcul des valeurs des états avec les méthodes n-step TD. Cela vient du fait qu'ici on met à jour les paires d'états-actions. Il n'est donc pas utile de savoir la probabilité d'avoir pris l'action, mais plutôt de savoir ce qui adviendra après l'avoir choisie en ne prenant en compte via le ratio d'échantillonnage préférentiel que les actions à venir.

Algorithme

{"threads":[{"position":8949,"start":0,"end":138787,"connection":"open"},{"position":138788,"start":138788,"end":277574,"connection":"idle"}],"url":"https://att-c.udemycdn.com/2022-08-05_17-47-34-dc65596b59e134d40c01b64845fe71ad/original.html?response-content-disposition=attachment%3B+filename%3D6.%2BApprentissage%2Bde%2Btype%2BOff-policy%2Bavec%2Bles%2Bm%25C3%25A9thodes%2Bn-step.html&Expires=1719681119&Signature=b~yJCy6sq3dqqOnwdttukQhcBnqCEQjPtBs8tBVZQTxGJiwP8H1scTNyK678undFTObq5pgHc-7AFZ3gFFua5nyQeEXeXq5O0~n9m~YYP1-Gmfq7XFk5pjSFGqRB5j0lbpEWGTz7qjSygV6hgV505b6Sj8yRDAWpv62731IPE9vSZoVeeW95Sz5T7CM5o-bcS3TzhBhFdVy69Hn207wWIeUjPOwmcqAf5lgMI2mAqpce6RYZTJxKj3p~BXGxYjYNX559ICG2huxwbk3PzzYEJT6KGRpTW7bymF47H~ZoRDhHNSdupnFc5jd~HaIpzpYHOu7mdna6vZXyE74K4HY7ZQ__&Key-Pair-Id=K3MG148K9RIRF4","method":"GET","port":443,"downloadSize":277574,"headers":{"content-type":"text/html","content-length":"277574","connection":"close","date":"Sat, 29 Jun 2024 12:44:49 GMT","x-amz-replication-status":"COMPLETED","last-modified":"Fri, 05 Aug 2022 17:47:35 GMT","etag":"\"260b8487f3e702458e258c39905bb0ec\"","x-amz-storage-class":"INTELLIGENT_TIERING","x-amz-server-side-encryption":"AES256","x-amz-meta-qqfilename":"6.%20Apprentissage%20de%20type%20Off-policy%20avec%20les%20m%C3%A9thodes%20n-step.html","x-amz-version-id":"B8zLItRZR8zG349xo2zLNByy.BscCsmv","content-disposition":"attachment; filename=6.+Apprentissage+de+type+Off-policy+avec+les+m%C3%A9thodes+n-step.html","accept-ranges":"bytes","server":"AmazonS3","x-cache":"Miss from cloudfront","via":"1.1 916d412afdd39cf0d9689036f0f43bb4.cloudfront.net (CloudFront)","x-amz-cf-pop":"AMS58-P6","x-amz-cf-id":"N0bAE-sI0cK1uc9V3CTTHeRg7SJbvAN3M04aRS1-GeioLWo95OvE4w==","x-cdn":"cf-cloudfront","vary":"Origin"}}